Introduzione alla Visione Artificiale e all'Elaborazione Digitale delle Immagini
La Visione Artificiale è il campo dell'intelligenza artificiale che consente ai computer di estrarre informazioni significative da immagini e video digitali, cercando di colmare il divario semantico tra i dati grezzi dei pixel e la comprensione a livello umano. L'Elaborazione Digitale delle Immagini funge da livello fondamentale per la Visione Artificiale, concentrandosi sulla manipolazione e sul miglioramento dei segnali immagine attraverso trasformazioni pixel-pixel per preparare i dati ad attività interpretative di livello superiore.
Principi Chiave
- Rappresentazione dei Dati: A livello macchina, un'immagine è un tensore numericizzato, non un'immagine olistica. Le immagini in scala di grigi sono matrici 2D di valori di intensità, mentre le immagini a colori sono tensori 3D che rappresentano i canali Rosso, Verde e Blu (RGB) con dimensioni $H \times W \times 3$.
- Trasformazione vs. Interpretazione: L'Elaborazione Digitale delle Immagini si occupa principalmente di operazioni immagine-immagine come la riduzione del rumore, la nitidezza o l'equalizzazione dell'istogramma. La Visione Artificiale si concentra su operazioni immagine-conoscenza come la classificazione degli oggetti, la localizzazione e la segmentazione.
- Il Paradigma della Grafica Inversa: La Visione Artificiale può essere considerata come l'inverso della Computer Grafica. Mentre la grafica cerca di generare un mondo visivo a partire da modelli matematici, la visione cerca di recuperare strutture 3D ed etichette semantiche da proiezioni 2D.
La Sfida Fondamentale
La sfida principale in questo campo è il Divario Semantico, ovvero la disconnessione tra i valori di pixel di basso livello elaborati dalle macchine e i concetti di alto livello percepiti dagli esseri umani.
Implementazione Python
Domanda 1
Quale processo è classificato come operazione immagine-conoscenza?
Domanda 2
A livello macchina, qual è la struttura dati di un'immagine a colori standard?
Caso di Studio: Sistema Diagnostico Medico
Leggi lo scenario qui sotto e rispondi alle domande.
Un ospedale sta sviluppando un nuovo sistema diagnostico medico automatizzato progettato per analizzare le radiografie alla ricerca di potenziali fratture ossee. Il sistema elabora i dati grezzi dei sensori della macchina a raggi X e genera un referto diagnostico per il radiologo.
D
1. Se il sistema applica un aumento del contrasto per rendere più chiare le strutture ossee, si tratta di Elaborazione Digitale delle Immagini (DIP) o Visione Artificiale (CV)?
Risposta:
Elaborazione Digitale delle Immagini. L'aumento del contrasto è una trasformazione immagine-immagine che migliora la qualità visiva del segnale senza estrarre significato semantico.
Elaborazione Digitale delle Immagini. L'aumento del contrasto è una trasformazione immagine-immagine che migliora la qualità visiva del segnale senza estrarre significato semantico.
D
2. Se il sistema segnala automaticamente un'area specifica come potenziale frattura, quale compito sta eseguendo?
Risposta:
Visione Artificiale / Rilevamento degli Oggetti. Il sistema sta interpretando il contenuto dell'immagine per estrarre conoscenza di alto livello (individuazione di una frattura).
Visione Artificiale / Rilevamento degli Oggetti. Il sistema sta interpretando il contenuto dell'immagine per estrarre conoscenza di alto livello (individuazione di una frattura).
D
3. Perché la riduzione del rumore è necessaria prima di eseguire un algoritmo di rilevamento?
Risposta:
Per migliorare la qualità del segnale e ridurre i falsi positivi nella fase di interpretazione semantica. Il rumore può essere interpretato erroneamente dagli algoritmi di CV come caratteristiche o bordi reali.
Per migliorare la qualità del segnale e ridurre i falsi positivi nella fase di interpretazione semantica. Il rumore può essere interpretato erroneamente dagli algoritmi di CV come caratteristiche o bordi reali.